ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维
ARC-AGI-3近被完美攻破,这个Harness能让AI掌握物理学家思维7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
搜索
7 月 16 日,伯克利博士后 Haven Feng 的一条推文火了。原因无他,结果很震撼:在 ARC-AGI-3 Public 集上,一套名为 [schema] 的智能体框架,与 Claude Opus 4.8、Fable 5 组合后达到 98.98% 的 RHAE;换成 GPT-5.6 Sol 组合,分数也有 95.35%。
这将是一个充满生产力的周末。就在刚刚,Claude 宣布当时时间 7 月 20 日起,Fable 5 继续留在所有 Max 和 Team Premium 套餐里,限额 50%。Pro 和 Team Standard 用户继续用积分访问,另外给用户发 100 美元的一次性积分。
7 月 14 日,Anthropic 正式发布 Claude for Teachers,面向美国 K12 教师免费开放高级功能,支持备课、课程设计、学习分析等教学场景。而在此之前,OpenAI 已经推出 ChatGPT for Teachers,同样聚焦教师教学支持,并计划向美国 K12 学区开放。
今天凌晨看到 Arena AI 更新 Code Arena 榜单时,我第一反应是有点意外。刚刚发布的 Kimi K3 拿到了 1679 分,排在全球第一,压过了 Claude Fable 5 的 1631 分和 GPT-5.6 Sol 的 1618 分。
天哪,打工人也能有自己的私人助理了!
最近一段时间,越来越多人开始讨论一个词:Loop。刚开始看到这个说法,我也觉得有点抽象。Agent 本身不就会反复思考、调用工具、修改代码吗?为什么还要专门设计一个 Loop?周末两天看完 Claude Code 团队写的一篇文章,我才发现,这件事其实没有那么玄乎。
这个月刚过半,AI圈就已经卷出天际了!
最近两周,因为Claude Fable 5回归、GPT-5.6上线再加上Tibo义父疯狂的重置。
这两天网上冲浪的时候,发现有人用 Claude 复刻了一个类似《魔兽世界》的在线多人游戏。
国产Coding模型杀疯了!实测1分20秒闭环真实Bug,1395行代码徒手捏出《我的世界》,长程工程能力直逼Opus 4.8,不用再当AI保姆了。这款装入CC的AI,就是快手发布的KAT-Coder-Pro V2.5,一款旗舰级的Agentic Coding模型。